-
Universal Manipulation Interface 论文精读:让机器人从野外人类示教中学习精读 UMI:用手持夹爪、鱼眼相机、隐式双目、视觉惯性 SLAM、延迟匹配与相对轨迹,把任意环境中的人类操作示教迁移到多种机器人。
15 min read -
DreamControl-v2 论文精读:让人形机器人在自身空间里“做梦”精读 DreamControl-v2:把异构人体动作预先重定向到 Unitree-G1 空间,用可控扩散先生成参考轨迹,再以物理 RL 学习可自主执行的全身技能。
16 min read -
VideoVLA 论文精读:让视频生成器同时想象与执行精读 VideoVLA:基于 CogVideoX-5B 的多模态 DiT 同时预测未来视频 latent 与 7D 动作,在 SIMPLER 和真实 Realman 上验证视频想象带来的泛化能力。
21 min read -
RL-100 论文精读:用真实世界 RL 把扩散策略推向 100% 成功率精读 RL-100:在扩散视觉运动策略上统一模仿学习、迭代离线 RL 与在线 RL,并用一致性蒸馏实现一步控制。
16 min read -
多相机视角扩展论文精读:用同步视角提升模仿学习的数据效率精读 Multi-Camera View Scaling:把一条同步多相机示教展开为伪示范,并以相机坐标动作和多视角动作聚合提升机器人模仿学习的数据效率与泛化。
18 min read -
MWM 论文精读:让世界模型预测真正影响机器人决策的东西精读 ICML 2026 的 Mask World Model:以未来语义 mask 而非 RGB 像素训练世界模型,并用预测特征驱动扩散策略,提升机器人对外观变化的鲁棒性。
15 min read -
Hume 论文精读:让 VLA 先思考,再流畅行动精读 Hume 的 value-guided System-2 thinking 与 cascaded action denoising,并对照官方代码分析双系统异步控制。
13 min read -
DUST 论文精读:双流扩散增强 World-Model VLA精读 DUST:用双流 MMDiT、解耦噪声与异步采样,把未来视觉状态建模融入 VLA,并在仿真、真实机器人和跨 embodiment 数据上验证。
17 min read -
DreamVLA 论文精读:让机器人先“做梦”再行动精读 DreamVLA:用动态区域、深度与语义构成的未来世界知识替代整帧预测,再由结构化注意力和 Diffusion Transformer 完成逆动力学控制。
19 min read -
3D Diffusion Policy(DP3)论文精读:用稀疏点云提升少样本视觉运动泛化精读 RSS 2024 的 3D Diffusion Policy:从单目深度构建稀疏点云,用轻量 DP3 Encoder 条件化 Diffusion Policy,在 72 个仿真任务和 4 个真实任务中实现高效、可泛化的模仿学习。
16 min read -
RDT-1B 论文精读:用 Diffusion Transformer 学习双臂操作精读 RDT-1B:如何用 Diffusion Transformer、物理可解释的统一动作空间和跨机器人预训练,解决双臂操作中的多模态与数据稀缺。
22 min read -
TinyVLA 论文精读:轻量 VLM 与扩散策略打造快速 VLA精读 TinyVLA:用 1.3B 以下的 Llava-Pythia 骨干和 Diffusion Policy decoder 替代大模型自回归动作 token,在少量机器人数据下获得更快推理、更强数据效率与跨任务泛化。
28 min read -
RoboDual 论文精读:让通才 VLA 与扩散专家协同控制精读 RoboDual:以 OpenVLA 负责语义规划、DiT 专家负责快速多模态动作去噪,解析双系统的条件桥接、异步推理、实验结果与官方代码差异。
24 min read -
Diffusion Policy 论文精读:用动作扩散学习视觉运动策略精读 Diffusion Policy:用条件去噪扩散在动作空间生成动作序列,结合 receding-horizon、视觉 conditioning 和 Time-series Diffusion Transformer,并对照官方代码拆解训练与推理。
21 min read -
CogACT 论文精读:让 VLM 负责认知,让 Diffusion Transformer 负责动作精读 CogACT:在 7B VLM 后接最大 308M 参数的 Diffusion Transformer 动作模块,用 cognition token 连接认知与动作,在 SIMPLER 与多台真实机器人上超过 OpenVLA 和 RT-2-X。
30 min read